Impacto da amostragem aleatória uniforme para o aumento da escalabilidade na geração de agrupamentos hierárquicos de séries espaço-temporais

نویسندگان

  • Rodolfo M. S. Mendes
  • Humberto Luiz Razente
  • Maria Camila Nardini Barioni
  • Luciana Alvim Santos Romani
چکیده

This paper presents the results of a scalable approach to build hierarchical clustering from space-time series. The goal is to reduce the complexity in terms of space and time. The approach explores data sampling pre-processing techniques to reduce the numerosity of the data. The experiment indicates it is needed the development of more efficient strategies than the naive selection of samples (uniform sampling). Resumo. Este trabalho apresenta resultados do emprego de uma abordagem escalável para o agrupamento hierárquico de séries espaço-temporais de imagens de satélite visando a redução da complexidade de tempo de execução e espaço do algoritmo. Para tanto são exploradas as técnicas de pré-processamento para redução da numerosidade, particularmente por meio de amostragem de dados. O experimento indica que é necessário o desenvolvimento de uma estratégia mais eficiente que a seleção ingênua de amostras (amostragem uniforme). 1. Introdução A análise de séries espaço-temporais [Dias et al. 2005] de imagens de satélite vem sendo utilizada como uma ferramenta complementar em estudos sobre os possı́veis impactos decorrentes dos cenários de mudanças climáticas globais. Essas séries permitem, por exemplo, analisar o uso e a cobertura do solo em uma determinada região e sua variação ao longo do tempo. Imagens de satélite de baixa e média resolução espacial possibilitam a extração de séries temporais como as de temperatura da superfı́cie e ı́ndice de vegetação para cada pixel da imagem. Diferentes análises podem ser realizadas a partir das séries extraı́das, como agrupamento ou classificação. Para facilitar o uso destas análises pelo tomador de decisão, pode-se georeferenciar os grupos/classes gerados em mapas bidimensionais permitindo visualizar o uso do solo em uma determinada região. O avanço das tecnologias de sensoriamento remoto tem permitido que satélites coletem cada vez mais imagens com intervalos de tempo menores (a cada poucos minutos). ∗Trabalho realizado com apoio financeiro da Capes, CNPq e Fapesp. Desta forma, a quantidade de imagens a serem armazenadas aumenta significativamente passando de terabytes para petabyes de dados. Além disso, satélites com resolução espacial média geram milhões de séries que, para serem analisadas, dependem totalmente do uso de métodos computacionais eficientes, preferencialmente, de complexidade linear. Os algoritmos de particionamento, por exemplo o k-means [Jain 2010], apresentam desvantagens com relação ao significado dos agrupamentos gerados, entre elas a necessidade de se fornecer antecipadamente o número de agrupamentos desejados e a tendência a encontrar agrupamentos esféricos ou regiões densas divididas por hiperplanos projetados, o que nem sempre corresponde à melhor descrição dos dados. Uma abordagem alternativa é o uso de algoritmos hierárquicos aglomerativos. Nestes algoritmos cada instância do conjunto de dados é colocada em seu próprio grupo inicialmente. Em seguida, os agrupamentos são aglutinados em grupos maiores, formando uma hierarquia de grupos. Diferentemente do k-means, o usuário não precisa fornecer o número k de grupos previamente. Embora a saı́da do algoritmo hierárquico seja um dendograma (uma hierarquia de grupos), este pode ser convertido em uma partição de k grupos por meio de uma poda na árvore resultante. Por sua vez, as partições resultantes deste processo não estão limitadas a formatos esféricos, sendo possı́vel detectar agrupamentos com formatos arbitrários. Apesar dessas vantagens, os algoritmos hierárquicos aglomerativos tem alto custo computacional para tempo e espaço, tornando sua aplicação impraticável para grandes conjuntos de dados como séries temporais de imagens de satélites de alta resolução temporal. Nesse sentido, podem ser aplicadas técnicas de redução de dados para acelerar a execução. Neste trabalho empregou-se uma técnica de pré-processamento para que se possa aproveitar as vantagens dos algoritmos hierárquicos mesmo em grandes conjuntos de dados. Esta abordagem consiste em reduzir o número de instâncias do conjunto de dados, para em seguida, aplicar o agrupamento hierárquico neste conjunto de dados reduzido. Por fim, todas as instâncias do conjunto de dados foram atribuı́das ao grupo mais próximo, utilizando a mesma medida de distância entre grupos utilizada no agrupamento inicial. Com esta abordagem é possı́vel aplicar o agrupamento hierárquico em tempo consideravelmente menor, mantendo a qualidade dos agrupamentos resultantes. O objetivo é avaliar a redução na qualidade dos agrupamentos ao empregar uma estratégia de seleção ingênua de amostras (amostragem uniforme). Este artigo está organizado da seguinte maneira. Na Seção 2 são apresentados os trabalhos correlatos. A Seção 3 apresenta a abordagem para agrupamento das séries. Na Seção 4 são discutidos os resultados preliminares e na Seção 5 as considerações finais e trabalhos futuros. 2. Trabalhos Correlatos O objetivo da etapa de pré-processamento é preparar os dados que alimentarão a etapa de mineração de dados. Nesta etapa, podem ser realizadas uma série de tarefas que visam aumentar a qualidade dos dados fornecidos à mineração de dados. Por exemplo, a tarefa de limpeza dos dados trata, por exemplo, de atributos sem valor definido e ruı́dos. Já a redução da dimensionalidade consiste em diminuir o número de atributos que serão considerados na mineração de dados. Por fim, a redução da numerosidade busca representar o conjunto de dados por meio de um número reduzido de instâncias [Han et al. 2011]. As estratégias para redução do número de instâncias são baseadas em amostragem de dados. Entre os desafios da amostragem estão o balanceamento das instâncias com relação à ocorrência de instâncias raras ou de exceções [Garcı́a et al. 2015]. As principais técnicas são: amostragem aleatória uniforme, amostragem balanceada, amostragem estratificada e amostragem de agrupamentos. Como em muitos conjuntos de séries temporais não há atributos de classe disponı́veis, necessários nas abordagens clássicas de amostragens balanceadas e estratificadas, não é possı́vel empregá-las neste trabalho. Nas últimas décadas, vários trabalhos empregaram técnicas de amostragem como etapa de pré-processamento de mineração de dados, como em [Meek et al. 2002]. A redução do tamanho do conjunto de dados por meio de amostragem aleatória é uma técnica intrı́nseca de vários algoritmos de agrupamento, entre eles CURE [Guha et al. 1998], CLARA [Kaufman and Rousseeuw 1990], CLARANS [Ng and Han 2002] e YADING [Ding et al. 2015]. Nestes trabalhos, a amostragem aleatória é aplicada estimando-se o tamanho mı́nimo das amostras para que as caracterı́sticas dos grupos sejam preservadas. Outros trabalhos correlatos abordaram a seleção de atributos para redução da dimensionalidade dos dados [Bones et al. 2016]. O BIRCH [Zhang et al. 1997] cria agrupamentos hierárquicos por meio de uma representação multidimensional compacta. Entretanto, nenhum desses trabalhos avaliou o uso de técnicas de amostragem para o agrupamento hierárquico de séries espaço-temporais. 3. Agrupamento hierárquico aglomerativo de séries espaço-temporais A estratégia consiste em reduzir o tamanho do conjunto de dados por meio de técnicas de amostragem, aplicar um agrupamento aglomerativo, e finalmente, atribuir as instâncias restantes aos seus grupos mais próximos, como apresentado no Algoritmo 1. Algoritmo 1: Agrupamento Hierárquico Aglomerativo com Amostragem Entrada: Conjunto de dados D, número de grupos K Saı́da: Agrupamento C 1. Selecionar amostra D, tal que |D| < |D| ; 2. Obter o agrupamento hierárquicoH ← AGNES (D) ; 3. Aplicar o procedimento de poda emH, obtendo o agrupamento C0, com K grupos ; 4. Atribuir os objetos restantes em D \ D aos grupos em C0, obtendo o agrupamento final C ; O algoritmo AGNES (AGglomerative NESting) é o algoritmo elementar (clássico) para executar o agrupamento hierárquico aglomerativo [Han et al. 2011]. Basicamente, seu procedimento consiste alocar inicialmente cada instância de dados em seu próprio grupo e então, sucessivamente, fundir os grupos mais próximos entre si, até que todos os objetos sejam aglomerados em um único grupo. Após cada instância de dados ser atribuı́da ao seu próprio grupo, a matriz de distâncias M é calculada, armazenando a distância de cada par de grupos existente. Então, sucessivamente, o algoritmo localiza a menor entrada na matriz de distância M , que equivale a encontrar o par dos grupos mais próximos, aglomera os grupos encontrados e recalcula a matriz de distância M . A aplicação de diferentes medidas de similaridade entre grupos resulta, entre outros, nos algoritmos: single-linkage calculado pela Equação 1 e complete linkage calculado pela Equação 2. dist (Ci, Cj) = min xi∈Ci,xj∈Cj {|xi − xj|} (1) dist (Ci, Cj) = max xi∈Ci,xj∈Cj {|xi − xj|} (2) A redução de dados tem papel fundamental na obtenção da escalabilidade dos algoritmos de agrupamento. Assim, o verdadeiro desafio na aplicação das técnicas de redução de dados é manter as caracterı́sticas do conjunto de dados original, para que seja possı́vel descobrir a estrutura dos grupos presentes. 4. Resultados Preliminares O conjunto de dados utilizado nos experimentos são valores de ı́ndice NDVI (Normalized Difference Vegetation Index) de uma área localizada entre as latitudes −8,55 e −8,45, e as longitudes−38,25 e−37,25, que corresponde a uma região do Estado de Pernambuco. Estes dados foram extraı́dos a partir de imagens coletadas pelo sensor MODIS (Moderate Resolution Imaging Spetroradiometer) durante o ano de 2003, em perı́odos de 16 dias. Assim, a cada pixel da imagem é associada uma série temporal composta pelos valores do ı́ndice NDVI coletados ao longo do ano. O conjunto de dados utilizado possui um total de 9812 séries temporais, cada uma com 23 valores do ı́ndice NDVI. O experimento consistiu em comparar o algoritmo hierárquico aglomerativo por amostragem com o algoritmo AGNES, ambos utilizando a ligação simples (single linkage) como medida de distância entre grupos. Os algoritmos foram comparados em relação ao seu tempo de execução e à qualidade dos agrupamentos gerados. Para medir a qualidade dos agrupamentos, utilizou-se os ı́ndices Dunn [Dunn 1973] e Davies-Bouldin [Davies and Bouldin 1979]. Para cada um dos algoritmos comparados, foi realizada a poda da hierarquia gerada em grupos k = 3, 5, 7. Por ser determinı́stico, o algoritmo AGNES foi executado uma única vez para cada valor de k. Já o algoritmo por amostragem foi executado com amostras de tamanho m = 10, 100, 1000. Por sua natureza probabilı́stica, o algoritmo por amostragem foi executado 10 vezes para cada combinação de m e k, e foram calculadas as médias do tempo de execução e das métricas de qualidade dos agrupamentos. O gráfico da Figura 1 apresenta a comparação dos tempos de execução em escala logarı́tmica (a amostra de tamanho 9812 corresponde à execução do algoritmo AGNES para a base completa). Embora o algoritmo baseado em amostragem precise, ao final do algoritmo, atribuir as instâncias restantes ao grupo mais próximo, o tempo de execução dessa etapa é da ordem de O (nm), onde n é o tamanho do conjunto de dados. Assim, a diminuição do número de instâncias processadas pelo algoritmo aglomerativo representou uma redução significativa no tempo de execução do agrupamento, como esperado. Além do tamanho da amostragem, também foi avaliado se o número de grupos utilizados na poda influenciaria a qualidade dos agrupamentos produzidos. O ı́ndice Dunn é obtido pela razão entre a menor distância entre pares de grupos diferentes e a maior distância entre pares de um mesmo grupo. Assim, para agrupamentos de maior qualidade,

برای دانلود رایگان متن کامل این مقاله و بیش از 32 میلیون مقاله دیگر ابتدا ثبت نام کنید

ثبت نام

اگر عضو سایت هستید لطفا وارد حساب کاربری خود شوید

منابع مشابه

Telesto: Indexação de Séries Temporais por Meio de Árvores de Sufixo Generalizadas

A time series is a collection of measurements made sequentially over time. Time series appear in various application such as finance, marketing, agriculture, weather and industrial and scientific data gathering. Similarity searching over time series databases is an important tool to extract knowledge. In this paper, we propose Telesto, a novel indexing technique aimed at time series similarity ...

متن کامل

Estimação Semicega de Canais com Correlação Usando Filtro de Kalman e Códigos Espaço-Temporais

Resumo— Neste artigo propomos um algoritmo semicego para estimação de canais MIMO planos, variantes no tempo e com correlação espacial entre as antenas. O estimador proposto utiliza um filtro de Kalman para rastrear o canal em sistemas empregando códigos espaço-temporais ortogonais por blocos. Após estabelecer um modelo em espaço de estados do canal com correlação espacial, mostramos que o esti...

متن کامل

Halite-ds: Agrupamento de Dados em Subespaços de Séries Temporais Multidimensionais

Given a data stream with many attributes, how to cluster similar events? For example, how to cluster measurements of tens of climatic attributes to aid in forecasting the climate and extreme events? The task of clustering data with many attributes is known as subspace clustering. Today, there exists a need for algorithms of this type well-suited to process data streams. This paper proposes the ...

متن کامل

Design and Performance of Chromium Mist Generator

O gerador de névoa crômica homogênea é uma ferramenta essencial para pesquisas e avaliações científicas, sobre a poluição do ar e seus sistemas de controle. O objetivo desta pesquisa foi projetar e construir um gerador de névoa de cromo e estudar alguns fatores, como altura de amostragem e distâncias entre amostras, em amostragens lado a lado, com o método de amostragem de névoa crômica. O gera...

متن کامل

Intercalation and Thermochemistry of Amines in Lamellar Titanium Phenylarsonate

O composto lamelar fenilarsonato de titânio foi sintetizado e intercalado com alquilmonoaminas (metil a heptil), diaminoetano e diaminobutano, lutidina e α-picolina. A matriz original foi caracterizada por análise elementar, difração de raios X, análise de superfície, porosidade, espectroscopia de absorção na região do infravermelho, termogravimetria e microscopia eletrônica de varredura. Os di...

متن کامل

ذخیره در منابع من


  با ذخیره ی این منبع در منابع من، دسترسی به آن را برای استفاده های بعدی آسان تر کنید

عنوان ژورنال:

دوره   شماره 

صفحات  -

تاریخ انتشار 2016